← На главную

Агентные фреймворки и метод агентных дебатов для верификации выводов

Субисследование к аналитическому обзору [[academic_research_findings|академических программ]]. На основе курса CMU 17-630: Prompt Engineering (Travis Breaux, S3D Department) и руководства Anthropic «Building Effective Agents». Для использования на семинаре СФИ — блок «Агентные системы как инструмент научной верификации».


1. Ключевой посыл

Курс CMU 17-630 завершается интеграцией всех техник в агентные системы (Week 9–10):

«Week 9: Agents I — introduces AI agents as systems that combine reasoning with the ability to act, including available agent frameworks and concepts of tool use, planning, and reflection»

«Week 10: Agents II — continues studying AI agents with concepts of orchestration, multi-agent systems, and guardrails for safety»

Anthropic в своём руководстве «Building Effective Agents» (2024) подчёркивает:

«The most common chaining pattern is self-correction: generate a draft → have Claude review it against criteria → have Claude refine»

Почему это важно для исследователя: одна модель — одна точка зрения. Несколько «агентов» (даже имитированных в одном чате) — это встроенная система перекрёстной проверки, аналог рецензирования в научном мире.


2. Персоны (Personas): роли для модели

2.1. Что такое persona prompting

Persona prompting — назначение модели конкретной роли через системный промпт:

Ты — историк-архивист, специалист по документам 
Поместного Собора 1917–1918 гг.

2.2. Что говорит наука (спойлер: всё сложнее, чем кажется)

Ряд крупных исследований 2024–2026 дали противоречивые результаты:

Исследование Вывод
Principled Personas (EMNLP 2025) Экспертные персоны дают положительный или нейтральный эффект, но модели чувствительны к нерелевантным деталям (падение до 30 п.п.)
«Playing Pretend» (Wharton, 2025) На сложных бенчмарках (GPQA) ни одна экспертная персона не улучшила точность. Google, Anthropic и OpenAI рекомендуют персоны, но эмпирика не подтверждает
«Helpful Assistant» ≠ Helpful (EMNLP Findings 2024) 162 персоны × 26 категорий: добавление персоны не улучшает и может ухудшить результат на объективных задачах
Jekyll & Hyde (IJCNLP Findings 2025) Ансамбль персоны + нейтрального промпта → +9.98% на GPT-4. Ключ: комбинация, а не одна персона
PRISM (2026) Персоны помогают в alignment-задачах (безопасность, стиль), но вредят задачам извлечения знаний

2.3. Когда персоны действительно помогают

Ситуация Эффект персоны Рекомендация
Фактический вопрос («Когда было X?») ❌ Нет улучшения или ухудшение Не использовать персону
Стиль/формат ответа ✅ Улучшение «Ты — редактор научного журнала»
Критический анализ ✅ Улучшение «Ты — строгий рецензент»
Множественные перспективы ✅ Улучшение через ансамбль Jekyll & Hyde / MPT
Снижение предвзятости ✅ Multi-Persona Thinking Несколько контрастных персон одновременно

2.4. Multi-Persona Thinking (MPT) — снижение bias

Multi-Persona Thinking (ACL Findings 2026)

Вместо одной персоны назначаются несколько контрастных — например, «консерватор» и «реформатор» — и модель проводит внутренний дебат между ними:

Рассмотри вопрос с трёх позиций:

Позиция A (историк-обновленец): [аргументы]
Позиция B (историк-традиционалист): [аргументы]  
Позиция C (нейтральный наблюдатель): [синтез]

Теперь оцени: где эти позиции сходятся? 
Где расходятся? Какие факты подтверждают каждую?

Результат: MPT снижает bias и при этом сохраняет качество рассуждений.


3. Memory Models: как агент помнит контекст

3.1. Проблема

Контекстное окно модели ограничено. В длинном исследовательском диалоге:

3.2. Таксономия памяти (обзор 2026)

«Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers» (2026). arXiv:2603.07670

Память агента формализуется как цикл write → manage → read:

Тип памяти Аналогия Реализация Пример
Контекстная (short-term) Рабочая память Текущее окно диалога Промпт + последние сообщения
Эпизодическая (episodic) Личные воспоминания Логи прошлых сессий «Вчера мы обсуждали X»
Семантическая (semantic) Энциклопедия Векторные БД, Knowledge Graph Загруженные PDF, NotebookLM
Процедурная (procedural) Навыки Сохранённые промпты, шаблоны «Всегда проверяй цитаты по алгоритму Y»

3.3. Практические системы

Система Архитектура Для исследователя
MemGPT Многоуровневая: main memory + recall DB + archive Автоматический swap между уровнями
NotebookLM Семантическая память на загруженных источниках Привязка к вашим PDF/документам
Claude Projects Контекстная память (до 200K токенов) + файлы Загрузка корпуса текстов
Custom Instructions Процедурная память (постоянные инструкции) «Всегда цитируй источники»

3.4. Иерархическая память (передовой край, 2026)

Серия работ ACL 2026 (HyperMem, GAM, TiMem, APEX-MEM) предлагает иерархическое хранение:

Уровень 3: Темы (Topic nodes)
    ↕
Уровень 2: Эпизоды (Episode nodes)  
    ↕
Уровень 1: Факты (Fact nodes)

APEX-MEM (ACL 2026): property graph + temporal grounding → 88.88% на LoCoMo QA, превосходя все предыдущие системы.

Практический вывод: будущие ИИ-ассистенты будут помнить все ваши прошлые сессии, с отслеживанием изменений и противоречий. Пока этого нет — ведите лог важных решений вручную.


4. Агентные дебаты: «Общество разумов»

4.1. Основополагающая работа

Du, Y. et al. (2024). «Improving Factuality and Reasoning in Language Models through Multiagent Debate». ICML 2024.

Вдохновение: концепция Марвина Минского «The Society of Mind» — интеллект = взаимодействие множества «агентов-специалистов».

Алгоритм:

           Вопрос
         /    |    \
    Агент 1  Агент 2  Агент 3
    (ответ)  (ответ)  (ответ)
         \    |    /
     ───── Раунд дебатов 1 ─────
    Каждый читает ответы других.
    Каждый критикует и уточняет свой.
         /    |    \
    Агент 1' Агент 2' Агент 3'
    (уточн.) (уточн.) (уточн.)
         \    |    /
     ───── Раунд дебатов 2 ─────
              ...
         Финальный консенсус

Результаты (MIT CSAIL):

4.2. Почему дебаты лучше рефлексии

Важная находка Du et al.: self-reflection (модель проверяет сама себя) работает хуже, чем дебаты между несколькими агентами.

Метод Фактуальность Почему
Один агент Базовая Одна точка зрения
Self-reflection Слабое улучшение Модель повторяет свои ошибки
Multiagent debate Лучший результат Взаимная критика выявляет ошибки, невидимые изнутри

Аналогия из науки: рецензирование одним автором ≠ peer review.

4.3. Развитие: верификация фактов через дебаты (2025–2026)

Система Инновация Результат
Tool-MAD (2026) Каждый агент имеет свой инструмент (поиск, RAG) +5.5% accuracy над baseline
DebateCV (2026) Adversarial дебаты для проверки утверждений 83.4% (golden evidence), превосходит все baseline на 2.6–5.8%
MAD-Fact (2025) Clerk + Jury + Judge — трёхуровневая верификация Превосходит SAFE и FIRE по precision и recall
GAVEL (ACL 2026) Evidence Contract — каждый аргумент привязан к цитате +4.2% FEVEROUS score, механическая проверка цитат
MAFC (Nature Sci. Reports, 2026) Множество источников + credibility scoring Лучший результат в multi-label fact-checking

4.4. Архитектурные паттерны (Anthropic, 2024)

Anthropic систематизировал паттерны агентных систем:

Паттерн Как работает Когда использовать
Prompt Chaining A → B → C (линейная цепочка) Задача разбивается на предсказуемые шаги
Parallelization A ↕ B ↕ C → синтез Независимые подзадачи, объединяемые в конце
Orchestrator-Workers Оркестратор → динамические воркеры Непредсказуемое количество подзадач
Evaluator-Optimizer Генератор ↔ Критик (цикл) Итеративное улучшение с чёткими критериями

Для верификации исследований наиболее релевантен паттерн Evaluator-Optimizer (Generate → Critique → Refine).


5. Практическая реализация для исследователя

5.1. Уровень 1 — «Ручные дебаты» (без программирования)

Шаг 1 — Генерация: Задать вопрос в Чате A

Шаг 2 — Критика: Открыть Чат B с другой персоной:

Ты — строгий рецензент, скептик. Вот анализ коллеги:
[вставить ответ из Чата A]

Найди все слабые места:
1. Какие факты не подтверждены источниками?
2. Какие выводы не следуют из посылок?
3. Что упущено?

Шаг 3 — Синтез: Открыть Чат C:

Вот два мнения:
Аналитик: [Чат A]
Рецензент: [Чат B]

Синтезируй: что из анализа выдержало критику, 
а что нужно пересмотреть?

5.2. Уровень 2 — «Встроенные дебаты» (один чат)

Проведи внутренний дебат по вопросу: [ваш вопрос]

Участник 1 — Защитник гипотезы:
Приведи 3 сильнейших аргумента ЗА.

Участник 2 — Оппонент:
Приведи 3 сильнейших аргумента ПРОТИВ.

Судья:
Оцени силу каждого аргумента. 
Какая сторона убедительнее и почему?
Какие факты нуждаются в проверке?

5.3. Уровень 3 — «Тройная верификация» (золотой стандарт)

На основе паттерна GAVEL:

[Промпт 1 — Аналитик]:
Проанализируй документ X. Для каждого вывода укажи 
точную цитату из источника.

[Промпт 2 — Верификатор]:
Проверь каждую цитату аналитика:
- Существует ли она в тексте?
- Точна ли она (дословно)?
- Поддерживает ли она сделанный вывод?

[Промпт 3 — Арбитр]:
Вот анализ и его верификация. 
Какие выводы подтверждены? 
Какие отклоняются? 
Сформулируй итоговое заключение с уровнями уверенности.

6. Пример для богословского исследования

Задача: Верификация тезиса об экклезиологии Собора

«Ручные дебаты» в 3 чата:

Чат A (Аналитик):

Какую экклезиологическую модель (соборность vs 
первенство) отражают «Определения» Поместного 
Собора 1917–1918 гг.? 
Приведи дословные цитаты из текстов определений.

Чат B (Оппонент):

Вот анализ коллеги о «Определениях» Собора:
[вставить ответ Чата A]

Ты — историк, критически настроенный к данной 
интерпретации. Найди:
1. Цитаты, которые ПРОТИВОРЕЧАТ выводу
2. Альтернативные интерпретации тех же текстов
3. Контекст, который коллега мог упустить

Чат C (Синтез):

Перед тобой два анализа одного и того же вопроса:
[Аналитик]: ...
[Оппонент]: ...

Составь таблицу:
| Тезис | Подтверждение | Опровержение | Вердикт |
Для каждого тезиса — укажи уровень уверенности.

7. Что показать на семинаре

Демонстрация 1: «Три чата — один вопрос» (5 мин)

  1. Открыть 3 вкладки ChatGPT/Claude
  2. В первой — задать исследовательский вопрос
  3. Во второй — вставить ответ первой с ролью «рецензент»
  4. В третьей — показать синтез

Вывод для аудитории: «Это и есть multiagent debate — метод, опубликованный MIT на ICML 2024. Вы имитируете его вручную в 3 вкладках. Учёные показали, что дебаты лучше, чем самопроверка: модель не может найти свои ошибки, но другая модель — может».

Демонстрация 2: «Встроенный дебат» (3 мин)

  1. Задать промпт «Проведи внутренний дебат...» (шаблон из §5.2)
  2. Показать: модель генерирует аргументы за и против
  3. Обратить внимание: какие факты судья отмечает как «нуждающиеся в проверке» — это и есть потенциальные галлюцинации

Ключевые тезисы для слайда

  1. 🤖 Один агент = одна точка зрения: self-reflection не ловит собственные ошибки (Du et al., ICML 2024)
  2. 🗣️ Дебаты > монолога: взаимная критика агентов снижает галлюцинации и повышает фактуальность
  3. 👤 Персоны — палка о двух концах: помогают в критическом анализе, но не улучшают фактическую точность (Wharton 2025, EMNLP 2025)
  4. 🧠 Multi-Persona Thinking: несколько контрастных позиций в одном промпте снижают bias (ACL 2026)
  5. 📋 GAVEL-паттерн: каждый аргумент привязан к цитате + механическая проверка (ACL 2026)
  6. 🔄 Generate → Critique → Refine: главный паттерн Anthropic для надёжных ответов

8. Чек-лист: «Агентная верификация за 5 минут»

# Действие Время Что даёт
1 Получите ответ в Чате A 1 мин Первичный анализ
2 Вставьте ответ в Чат B с ролью «рецензент-скептик» 1 мин Внешняя критика
3 Проверьте: совпадают ли факты в обоих ответах? 1 мин Перекрёстная валидация
4 Попросите Чат C синтезировать и указать уровни уверенности 1 мин Арбитраж
5 Проверьте одну ключевую цитату вручную по источнику 1 мин Spot-check

9. Связь с другими темами семинара

Тема семинара Связь с агентными фреймворками
[[Декомпозиция сложных задач на многоэтапные цепочки промптов (multi-stage prompting).]] Агенты = автоматизированная декомпозиция; оркестратор разбивает задачу, воркеры выполняют подзадачи
[[Исследование феномена сикофантии (склонности ИИ льстить пользователю и подтверждать его неверные гипотезы) и галлюцинаций.]] Дебаты = антидот к сикофантии. Агент-оппонент не «льстит», а критикует. Multi-Persona Thinking снижает bias
[[Оценка эффективности промптов через метрики самосогласованности (self-consistency) и калибровки ответов.]] Дебаты = «самосогласованность 2.0»: вместо majority vote по ответам — structured critique с обоснованием
Парадигма 3 (Среда / NotebookLM) NotebookLM = память (semantic store) + grounding. Агент с памятью + источниками = полная система
Методология «Святая Память» Принцип цитируемости реализуется в GAVEL-паттерне: Evidence Contract привязывает каждый вывод к конкретному источнику

Источники

  1. Du, Y. et al. (2024). Improving Factuality and Reasoning in Language Models through Multiagent Debate. ICML 2024. arXiv:2305.14325
  2. Anthropic (2024). Building Effective Agents. anthropic.com/research/building-effective-agents
  3. Anthropic (2025). How we built our multi-agent research system. anthropic.com/engineering/multi-agent-research-system
  4. «Principled Personas» (EMNLP 2025). — 9 LLMs × 27 tasks: персоны чувствительны к нерелевантным деталям
  5. «Playing Pretend: Expert Personas Don't Improve Factual Accuracy» (Wharton, 2025). — экспертные персоны не улучшают точность
  6. «When "A Helpful Assistant" Is Not Really Helpful» (EMNLP Findings 2024). — 162 персоны: нет улучшения на объективных задачах
  7. Jekyll & Hyde (IJCNLP Findings 2025). — ансамбль персоны + нейтрального промпта: +9.98% на GPT-4
  8. Multi-Persona Thinking (MPT) (ACL Findings 2026). — контрастные персоны снижают bias
  9. PRISM (2026). — персоны помогают в alignment, вредят в knowledge retrieval
  10. Tool-MAD (2026). — агенты с разными инструментами: +5.5% accuracy. arXiv:2601.04742
  11. DebateCV (2026). — adversarial дебаты: 83.4% на fact verification
  12. GAVEL (ACL Findings 2026). — Evidence Contract + механическая проверка цитат
  13. MAFC (Nature Scientific Reports, 2026). — multi-agent fact-checking с credibility scoring
  14. «Memory for Autonomous LLM Agents» (2026). arXiv:2603.07670 — обзор архитектур памяти
  15. APEX-MEM (ACL 2026). — property graph: 88.88% на LoCoMo QA
  16. CMU 17-630 Schedule — Weeks 9–10: Agents I & II